연속 확산 언어 모델(CDLM)의 부활
몇 년간 정체됐던 연속(continuous) 확산 언어 모델 연구가 최근 다시 활발해지고 있습니다. 이 글은 자기회귀(autoregressive) 방식이 지배하는 언어 모델 패러다임에 대한 대안으로서, 2021년 이산(discrete) 확산 모델과 2022년 Diffusion-LM 등 연속 확산 접근법의 역사와 기술적 배경을 정리합니다. 텍스트 생성의 병렬화·제어 가능성 측면에서 중요한 연구 흐름입니다.
몇 년간 정체됐던 연속(continuous) 확산 언어 모델 연구가 최근 다시 활발해지고 있습니다. 이 글은 자기회귀(autoregressive) 방식이 지배하는 언어 모델 패러다임에 대한 대안으로서, 2021년 이산(discrete) 확산 모델과 2022년 Diffusion-LM 등 연속 확산 접근법의 역사와 기술적 배경을 정리합니다. 텍스트 생성의 병렬화·제어 가능성 측면에서 중요한 연구 흐름입니다.
AI 탐지 스타트업 팬그램(Pangram)이 문장당 오류율을 획기적으로 낮춘 새로운 탐지 모델 'Pangram 4'를 공개했습니다. 이 모델은 인간이 작성한 텍스트를 AI가 쓴 것으로 오인하는 경우가 2만4000건당 1건에 불과하며, AI 글을 사람처럼 바꿔주는 '휴머나이저' 우회 공격에도 강한 내구성을 보입니다. 실무자들에게는 AI로 가벼운 윤문을 한 텍스트와 100% AI가 생성한 텍스트를 구분할 수 있다는 점에서 높은 활용도를 기대할 수 있습니다.
구글 딥마인드가 실험적인 260억(26B) 매개변수의 오픈 모델인 'DiffusionGemma'를 공개했습니다. 이 모델은 텍스트 디퓨전(Text Diffusion) 기법을 적용하여 GPU 환경에서 기존 대비 최대 4배 빠른 속도로 텍스트를 생성하는 것이 특징입니다.
AI 생성 텍스트에서 '단순히 A일 뿐만 아니라 B이다'라는 특정 문장 구조와 대시(—) 기호의 사용이 급증하고 있습니다. 시장 조사에 따르면 기업 보도자료 및 실적 보고서에서 해당 표현의 사용 빈도가 최근 수년 새 4배 이상 폭증했으며, 이는 기업들의 AI 의존도가 얼마나 높아졌는지 보여주는 상징적인 지표로 평가되고 있습니다.
2019년 오픈AI는 특정 주제를 주면 문맥에 맞는 글을 매우 자연스럽게 생성하는 텍스트 생성 모델 GPT-2를 발표했습니다. 그러나 가짜 뉴스나 악의적 콘텐츠 생성 등 안전 및 보안상의 우려로 인해 원본 모델이 아닌 축소된 버전만 공개하기로 결정했습니다. 이 결정은 AI 알고리즘의 위험성과 윤리적 공개 기준에 대한 업계 전문가들의 치열한 논쟁을 촉발하는 계기가 되었습니다.